本篇階段:更好的提示詞(收尾)/開始用 Agent
使用介面:claude.ai(提示詞設計)、Gemini Notebook(實際執行)、Claude in Chrome(活用 Claude 的瀏覽器官方外掛)
Day 03 寫到後來就沒力了,當時留下三個待處理的項目:
今天把這三件事做完,改出來的版本我直接叫它 final,因為這是我決定停下來的版本。前半篇拿 final 直接跟 v3 對比,講它治好了什麼、還有什麼治不好,以及為什麼決定停在這裡。
然後會講一件更掃興的事:跑到後面才發現,衡量改動有沒有效的那把尺,本身的刻度比要量的東西還粗。(此時此刻只能說Gemini要加油)
後半篇換題目,講 Claude in Chrome,以及我拿它做的第一件事。(其實這才是原本的主題)
final 的完整指令是
投資理財YT影片摘要-final.txt,三次執行的輸出分別是結果final_trial-1.txt、結果final_trial-2.txt、結果final_trial-3.txt,請見提示詞參考連結、Gemini Notebook 實測。
| v3 | final | |
|---|---|---|
| 篇幅 | 約 1500 字 | 約 3600 字,分 13 節 |
| 股名與代號 | 只能寫影片唸出來的,其餘寫「代號未提供」 | 掛三個證交所代號查詢頁當來源,逐檔查證並覆寫 |
| 來源分類 | 無 | A 類規則書、B 類影片、C 類代號表,各自能做什麼寫死 |
| 字數 | 4000~6000 字(下限) | 3000 字以內(上限) |
| 深度要求 | 無 | 第 7 節:供應鏈定位、時間節點、財務數據三項 |
| 供應鏈定位 | 無 | 三步決策樹,先判斷是不是科技製造鏈 |
| 態度值域 | 五級,靠模型自己遵守 | 五級+對映表(想寫「中性偏多」→ 填「偏多」) |
| 可回溯性自查 | 刪掉了 | 6.6 加回,先建暫存表再從表裡挑 |
| 共識區模板 | 看多者:(甲)、(乙) |
看多者:(所有可回溯的分析師姓名) |
| 填寫範例 | 無 | 第 11 節給兩檔虛構範例,其中一檔刻意不寫供應鏈 |
v3 的邏輯是「不確定就不要講」。final 的邏輯是「不確定的東西去查,查不到才不要講」,差別在於 final 多了一個模型可以真的去查的地方。
以下的比較,final 這一欄用的是三次執行裡最好的那一次,為什麼要特別講「最好的那一次」,第 5 節會說明。
Day 03 的結論是,模型無法驗證的欄位只有兩條路,刪掉、或由人提供白名單。final 走第二條,但沒有自己維護白名單,而是把三個頁面直接掛進 Gemini Notebook 當來源:
strMode=2 → 上市
strMode=4 → 上櫃
strMode=5 → 興櫃
規則寫成查詢順序(照順序,查到就停),並且比 v3 多一句關鍵的動作指令:
查到後,用 C 類網頁列出的「簡稱」覆寫股名、用「有價證券代號」覆寫代號,兩者一起覆寫,不得只換代號、保留自己聽打或猜測的股名。
「兩者一起覆寫」是中間好幾版才補上的。早期版本只寫「用來校正你的錯字與錯誤代號」,結果實測跑出「代號查對了、名字保留自己猜的」這種半吊子產物,例如代號 2359 對了,名字寫成「索羅門」(正確是所羅門)。驗證機制只會修好它拿去比對的那個欄位,不會反過來修產生查詢字串的那個欄位,所以要明講兩邊都要換。
實測(不重複代號計):
| v3 | final | |
|---|---|---|
| 寫出的不重複代號 | 11 | 18 |
| 「代號未提供/待確認」 | 22 次 | 0 次 |
| 疑似股名聽錯 | 7 | 1 |
v3 那些明顯的錯誤大多消失了:台光電從 6213 變 2383、聯亞不再寫成「連雅」、宏捷科不再寫成「紅杰科」、南亞科不再寫成「南雅科」、嘉晶不再寫成「嘉金」、緯穎那個離奇的「維影(669)」也沒有再出現。
通則:模型無法驗證的欄位,與其要它標註不確定,不如給它一個可以查的地方,並且明講查到之後要覆寫哪些欄位。
Day 03 最出乎意料的失分是字數。v3 目標 4000~6000 字,實得約 2700,當時的假設是規則的抑制效果溢出,模型被「沒提到就刪」教得太保守。
final 做了兩件相反方向的事。第一,在最高原則加了一條專門對沖的:
原則二:但也不要為了保守而省略。影片講過的數字、價位、型態、時程都要寫進去。原則一管「不要多」,原則二管「不要漏」,兩者同等重要。
第二,加了第 7 節,把總量目標拆成三個具體欄位:供應鏈定位、時間節點、關鍵財務數據。
實測(以中文字計,跟 Day 03 的目視估算不同口徑):
| v3 | final | |
|---|---|---|
| 全文中文字 | 2744 | 2390 |
| 個股條目 | 32 | 15 |
| 個股理由帶數字的比例 | 10/32(31%) | 9/15(60%) |
| 關鍵時程欄位 | 無此欄位 | 5 處 |
| 供應鏈定位欄位 | 無此欄位 | 14/15(93%) |
字數反而更少,但這次是達標的,因為 final 把目標從 4000 字的下限改成了 3000 字的上限。誠實的說法是:沒有讓模型變得比較會寫長,是把目標改成它做得到的形狀。
真正變好的是密度。個股數量砍掉一半,留下來的理由帶著影片講過的數字:例如本益比 16.8 倍、7 月營收年增 176%、毛利率從 7.9% 升到 23.5%、萊茵河水位剩 6 公分。v3 有一半的理由是「型態漂亮」「展望佳」這種可以套在任何一檔股票上的句子。
關鍵時程是純粹新增的收穫,v3 完全沒有這個維度。
供應鏈那一欄的過程比結果有意思。 最早的寫法是「影片沒講位置就不要自己判斷,該行刪除」,實測 0 次觸發,15 檔一檔都沒填。後來改成三步決策樹:
步驟 A 這檔是不是科技製造鏈的一環?
不是(航運、金融、原物料、債券)→ 整行省略
步驟 B 是,且影片明確點出位置 → 標上游/中游/下游
步驟 C 是,但影片沒點出位置 → 寫「(供應鏈定位待確認)」
觸發率直接跳到 93%,而且萬海(貨櫃航運)三次執行都正確地沒有這一行,步驟 A 擋得很準。
通則:把「判斷」改寫成「照順序回答幾個是非題」,比把規則講得更用力有效。
這是 final 最大的缺口,也是我決定停手的主因。
Day 03 第 7.4 節寫得非常有把握:v2 有一條自查(總覽區只反映確實出現在下方的觀點),v3 改版時弄丟了,所以共識區出現大量湊出來的人名。當時的結論是加回來就好。
final 不但加回來了,還升級成先建暫存表、再從表裡挑:
彙整共識前,先列一張暫存表,逐一分析師把他區塊裡「看好產業」「看多個股」「看壞產業」「看空個股」四欄的內容抄一遍。共識區的每一條,只能從這張暫存表裡挑,不可另外新增這張表沒有的產業或個股。
然後逐條回去對最好那次的輸出:
| 共識條目 | 掛的人名 | 在他自己區塊找得到的 |
|---|---|---|
| AI 伺服器與供應鏈 | 林漢偉、李永年、艾綸、宛瑩 | 4/4 |
| 光通訊與細光子(CPO) | 林漢偉、楊雲翔、艾綸、宛瑩 | 3/4 |
| 機器人與自動化概念 | 林漢偉、楊雲翔、艾綸 | 1/3 |
| 貨櫃航運 | 林漢偉、艾綸、宛瑩 | 1/3 |
| 台積電(2330) | 李永年、宛瑩 | 1/2 |
| 萬海(2615) | 林漢偉、艾綸 | 1/2 |
| 大立光(3008) | 林漢偉、楊雲翔、艾綸 | 0/3 |
7 個條目、21 個人名,站得住的只有 11 個。完整可回溯的條目只有 1 條。
大立光那條最誇張:三個人名,而大立光在整份報告的分析師區塊裡根本沒出現過,這種「憑空長出一檔股票再配上三個人名」的模式,v3 和 final 都出現,只是每次換一檔。
為什麼加了暫存表還是沒用?Day 03 的通則其實已經預告了答案,只是當時沒有套用到自己身上:
對弱模型,不要下需要自省的指令,要下可以查表的指令。
「檢查共識區的人名能不能在下方找到對應」就是一條標準的自省指令。 它要求模型讀自己剛寫完的輸出、做跨區塊交叉比對、再刪掉自己寫過的東西。這跟「不確定就標待確認」是同一個機制,而那個機制在 v2、v3 已經連續失敗過。所謂「先建暫存表」,模型並沒有真的建表,它只是把那段話讀過去而已。
中間有一版試過把輸出順序倒過來,先寫完六個分析師區塊、再回頭數票,可回溯率確實有拉高。但同一個改動也把某區塊整個弄不見了,還讓已經修好的股名退回錯字版本。改一個地方、壞兩個地方,來回幾次之後我決定收手。
前面四節的所有比較,都建立在「跑一次、量一次」上。做到最後我把同一份 final 指令,在完全沒改一個字的情況下連跑三次。
| 指標 | 第 1 次 | 第 2 次 | 第 3 次 |
|---|---|---|---|
| 供應鏈觸發率 | 36% | 93% | 92% |
內文引用標籤 [1, 2, 6] |
58 個 | 0 | 0 |
| 標題的 📅 emoji | 無 | 無 | 有 |
| 共識可回溯率 | 36% | 52% | 45% |
| 一致看空章節 | 今日無此共識 | 今日無此共識 | 列出技嘉 |
| 全文中文字 | 2086 | 2390 | 2134 |
第一次那 58 個引用標籤特別值得講。9.10 白紙黑字寫著「全文請勿在內文句子後方標註任何 [1]、[2] 等引用數字或標籤」,第一次跑 final 就冒出 58 個,連第一行日期標題都掛了 [1-5],而編號一路跑到 [75],那是 Gemini Notebook 內部的 chunk 編號,直接貼到 LINE 會是一堆垃圾字元~~(這句話不是我說的,是 Claude 說的 xD)~~。第二次、第三次又回到 0。
最無法反駁的一筆是同一檔股票。同一份指令跑三次,三個答案:
| 執行 | 輸出 |
|---|---|
| 第 1 次 | 嘉金(代號待確認) |
| 第 2 次 | 嘉晶(3016) |
| 第 3 次 | 嘉金(6706) |
一次放棄、一次全對、一次股名和代號都錯。第 2 節那整套查表規則在這三次之間一個字都沒改。而第二次證明了它有能力查對,只是不保證會查。
於是問題就不是「規則寫得夠不夠好」,而是:
我一直在用一把刻度比待測物還粗的尺,去量規則改動的效果。
前四節那些「v3 是 31%、final 是 60%」的比較,有多少是規則造成的、有多少只是抽到不同的骰子,用單次取樣分不出來。Day 03 那張三版對照表也是一樣的問題,當時只在註解寫了「單次取樣、屬定性觀察」,現在有了具體的變異量級:同一份指令、同一批影片,供應鏈觸發率可以從 36% 跳到 93%。
跑完三次之後,可以把規則分成兩類:
三次都一致的(可以相信改動真的有效)
๑๑๑ 和 σσσσσ 之後,三次全部完整保留,沒有被縮寫或正規化。每次都不一樣的(改了也不知道有沒有用)
規律相當清楚:格式類、值域類的規則穩定;凡是需要查外部資料、需要跨區塊比對、需要判斷「這個欄位到底該不該填」的規則,就不穩定。
單次生成的摘要,做到 final 這個程度大概就是天花板了。理由有三個。
一、還在進步的部分,進步幅度已經小於雜訊。 再花力氣把共識區的可回溯率從 45% 推到 55%,我沒有辦法證明那是規則的功勞。
二、剩下的缺陷都是同一種類型。 共識區湊人名、簡稱查不到代號、跨區塊的一致性,全部需要模型回頭檢視自己的輸出。這件事在單次生成裡做不到,多寫幾條規則也不會變成做得到。
三、改一個地方會壞另一個地方。 倒序輸出救了共識區、弄丟了分析師區塊;範例加一檔沒有供應鏈的股票,本來是想教它「航運不用寫」,規則之間的交互作用已經超過我能用單次取樣觀察的範圍。
所以現在的用法是:final 產出的報告,分析師區塊的部分可以直接貼給親友看,共識區當成目錄看、不要當結論看。 需要真的下判斷時,還是回去看各個分析師自己講了什麼。
如果一定要再往上,路只有一條:拆成兩次呼叫,先產分析師區塊,把那份輸出當成新來源,第二次只做數票這一件事。這樣就把自省變成了檢索,而檢索是它做得到的。 這不在今天的範圍了。
本文所有數字都來自這四個檔案:規則書
投資理財YT影片摘要-final.txt,輸出結果final_trial-1.txt/-2/-3。
這兩天做的事情有個共通點:Claude 不碰執行,只負責寫給別人執行的東西。指令從我這裡出去,經過 Claude 加工,交給 Gemini Notebook 跑,錯了我再回頭改指令。 中間隔了一層,所以每次修正都要等一整輪,而且從今天的結果看,那一輪回饋還未必是真的。
Claude in Chrome 是另一個方向。它是 Anthropic 的 Chrome 擴充功能,讓 Claude 看得到目前的分頁內容,並且直接在頁面上操作,點連結、填欄位、換頁、把幾個分頁的東西湊在一起。授權是逐個網站給的,官方也特別提醒網頁內容本身可能夾帶提示詞注入,因為模型讀到的東西是別人寫的。
換句話說,昨天到前面的部分是「我寫指令、別人執行」,今天開始變成「我寫指令、Claude 自己執行」,回饋不用等一整輪,錯在哪一步當場看得到。
最近發現肌酸是個有重訓的話需要補充的保健品,當然要好好比價一下:MOMO、PChome、蝦皮各開一輪,找同一款、看包裝克數、算單價、看有沒有券、加上運費。
這件事很適合當第一個題目,因為它跟財經摘要是同一類問題的兩個變形。
表面上它比摘要簡單。 價格是頁面上的數字,不是聽出來的,理論上沒有同音誤聽的空間。
實際上它更髒。 同一款產品在三個平台的商品名稱寫法完全不同,有的把克數寫在標題、有的寫在規格表;標價、活動價、券後價、滿件折扣是四個不同的數字;運費有的內含有的外加;還有一堆看起來很像但其實是不同口味或不同容量的品項。
也就是說,這裡每一個欄位都是 Day 03 講的那種「模型無法驗證的欄位」,只是這次它有機會自己去頁面上查。
來實測看看 Claude 會給我們什麼樣的驚喜~
其實好像不用給他什麼設定,我設定 Auto。

輸入:幫我比價在PCHOME、MOMO、蝦皮購物的肌酸價格
肌酸價格比較 - PChome / momo / 蝦皮購物
資料擷取時間:2026/08/18(未計入平台折價券、滿額贈、蝦幣折抵等,實際結帳金額可能更低)
| 商品 | PChome 24h | momo購物網 | 蝦皮購物 | 備註 |
|---|---|---|---|---|
| TRYALL iCreatine肌酸 400g | $499(原$599) | $499(原$599) | $479(蝦皮直營,8折) | |
| MYPROTEIN 一水肌酸 250g | $699~988(原$920~1299) | $939~988(原$1,299) | $459~599 | 蝦皮多賣家,含250g/500g/1kg混賣 |
| ON 歐恩 CREATINE 肌酸 300g | $899(原$1,199) | $950(原$1,199) | $1,149 | 蝦皮為600g規格,非同規格 |
| ON 歐恩 微粉肌酸膠囊 300顆 | $1,499(200顆規格) | $2,280(原$2,999) | $1,999(6.7折) | PChome為200顆規格,非同規格 |
| 巴弟蛋白 微粉化一水肌酸 500g | $529(原$950) | $559~999(原$950~1900) | $489 | 蝦皮版本非Myprotein授權 |
| GOpower 果果能量 微粉化肌酸 400g | $659(原$799) | $659(原$799) | $537~629 | 蝦皮多賣家 |
| 紅牛 聰勁肌酸 200g x2罐 | $999(原$1,600) | $999(原$1,600) | 未見同規格 |
下面是 Claude 給的幾句話。
幾個觀察:
蝦皮因為是多賣家平台,同款商品常有好幾個賣場在賣,價格區間較大也較常出現最低價(尤其MYPROTEIN、GOpower這類熱門款),但要留意賣家評價、出貨地與是否為官方授權經銷。PChome和momo的價格常常非常接近(同商品甚至同價),這兩家多是品牌官方旗艦店直營。momo在部分品項(如ON歐恩膠囊、巴弟蛋白)反而比PChome貴一些,可能因為當下折價券或活動不同。
以上價格是搜尋當下(2026/8/18)頁面顯示的售價,未計入平台折價券、滿額贈、蝦幣/紅利折抵等,實際結帳金額可能再低一些。如果你有鎖定特定品牌或容量(例如只看一水肌酸400g裝),我可以幫你更精準地抓三平台同規格的價格。
點了點看看!完全沒錯,看來以後又多了個比價的方式了!(開始看機票)
比價 demo 是多網站、多欄位、會隨時間變動的資料源。第二個 demo 反過來,故意挑一個最單純的情境:不逛,只給一個網址,讓 Claude in Chrome 把維基百科某一頁裡的圖片找出來、存到本機。
挑這個當第二題,是想找一個跟比價相反的對照組。維基頁面是靜態內容、不會像電商頁面一樣有特價或缺貨,理論上「同一份指令跑兩遍」的變異應該比第 5 節小很多 (當然用 Claude 跟 Gemini 比不太公平)。
表面上這比比價簡單。 只有一頁,不用跨站比對,也不用算單價這種需要推算的欄位。
實際上維基頁面本身就很雜。 一頁裡除了文章內容圖,還混著維基的介面裝飾:站徽、編輯鉛筆圖示、國旗小圖示、引用來源的外部連結圖示;同一張圖常常同時出現在右側資訊框(infobox)和內文段落裡;圖片點進去還有縮圖網址和原始解析度網址兩種連結,維基的檔案描述頁(File:)又是另一層。
來實測看看 Claude 會給我們什麼樣的驚喜~
抓取 "希爾伯特-黃轉換" 的 "EMD演算法流程圖"。


註一:第 2 至 4 節的比較,final 一欄取自三次執行中表現最好的一次,v3 則是單次取樣。第 5 節說明了為什麼這種比較方式本身就有問題,請當作定性觀察。
註二:代號正確性未逐一向證交所頁面查證,判定基準是與 Day 03 已列出的正確股名對照,請當作待確認。第 5 節那張「同一檔三個答案」的表格,正好說明為什麼我不敢說哪一個是對的。
註三:第 8 節對 Claude in Chrome 的功能與權限描述以官方說明為準。
註四:本文提及的所有個股名稱與代號僅為提示詞測試素材,不構成任何投資建議。
註五:本文提供的提示詞供參考,若有其他的看法或建議歡迎留言。